當地時間 9 月 1 日,Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1。Anthropic 在官方部落格裡表示,一家投資機構被一個軟體崩潰問題困擾了很久,工程師始終查不出原因,使用其他 AI 模型也試過,但是全都沒有答案。後來他們讓 Fable 5.1 試了一下,終於找到了問題根源。
這恰好說明了一個趨勢,那就是新一代模型正在從回答問題走向解決問題。Fable 5.1 在 Terminal-Bench-Science 0.1 基準測試中得分為 52.6%,比上一代翻了超過一倍。在編碼測試中提升了 13%。它還設計了成功率接近 50% 的蛋白質結合劑,將七個開源模型的 GPU 推理速度最高提升了 2.5 倍,並使用 NASA 三十多年前的雷達資料繪製了一張高精度金星地圖。
但是這次發佈最值得注意的,也許不是某個分數。Anthropic 此次推出了兩個版本的模型:Fable 5.1 面向所有使用者開放,Mythos 5.1 隻面對經過稽核的機構開放。兩個模型能力是相同的,區別在於安全限制的嚴格程度大小。Mythos 5.1 放開了更多的限制,能夠處理網路安全和生命科學領域的敏感任務。Anthropic 稱,Mythos 5.1 模型是“我們發佈過的模型中網路能力最強的”。
價格也降了一些,Fable 5.1 的快取讀取費用降低了大約 75%,每百萬的 token 只需 0.25 美元。對於常規任務來說,整體的成本比 Fable 5 降低了約 25%。對於那些大量使用 AI 智能體的複雜任務來說,節省的成本更多,最高能夠達到 45%。